-
InternVLA-M1 论文精读:用空间先验连接 VLM 推理与机器人动作精读 InternVLA-M1:通过 230 万条空间 grounding 数据、空间提示和双监督训练,让 Qwen2.5-VL 的空间推理迁移到 DiT 动作专家。
20 min read -
CLAP 论文精读:从人类视频学习可执行的 Vision-Language-Action 模型精读 CLAP:用 Act-VAE 建立物理动作词表,再以 VD-VAE 对齐人类视频,训练 CLAP-NTP,并用 CLAP-RF 与 Knowledge Matching 实现快速控制。
22 min read -
TinyVLA 论文精读:轻量 VLM 与扩散策略打造快速 VLA精读 TinyVLA:用 1.3B 以下的 Llava-Pythia 骨干和 Diffusion Policy decoder 替代大模型自回归动作 token,在少量机器人数据下获得更快推理、更强数据效率与跨任务泛化。
28 min read -
RT-2 论文精读:Vision-Language-Action Models精读 RT-2:把低层机器人动作编码成 VLM 文本 token,与互联网图文数据 co-fine-tune,让 VLA 直接输出控制动作,并系统分析其泛化、符号理解、推理与代码边界。
21 min read -
OpenVLA-OFT 论文精读:Fine-Tuning Vision-Language-Action Models精读 OpenVLA-OFT:通过并行解码、Action Chunking、连续动作与 L1 回归,把 7B VLA 适配到 LIBERO 与双臂 ALOHA。
29 min read -
OpenVLA 论文精读精读 OpenVLA:一个 7B 开源视觉-语言-动作模型,如何融合 DINOv2、SigLIP 与 Llama 2,用动作 tokenization 在 Open X-Embodiment 上实现多机器人控制与低成本微调。
26 min read -
Diffusion Policy 论文精读:用动作扩散学习视觉运动策略精读 Diffusion Policy:用条件去噪扩散在动作空间生成动作序列,结合 receding-horizon、视觉 conditioning 和 Time-series Diffusion Transformer,并对照官方代码拆解训练与推理。
21 min read -
CogACT 论文精读:让 VLM 负责认知,让 Diffusion Transformer 负责动作精读 CogACT:在 7B VLM 后接最大 308M 参数的 Diffusion Transformer 动作模块,用 cognition token 连接认知与动作,在 SIMPLER 与多台真实机器人上超过 OpenVLA 和 RT-2-X。
30 min read